您现在的位置是:1lvyun 電子煙線上購買 > 綜合

被撞得四再後不裂,兩年分五翻車

1lvyun 電子煙線上購買2026-08-27 15:30:26【綜合】4人已围观

简介來源:中國新聞周刊8月22日晚,第二屆世界人形機器人運動會在國家速滑館“冰絲帶”開幕。賽場上演了不少機器人“翻車”的名場麵。在400米大型組)預賽中,有機器人選手未跑出第一個彎道便摔倒在地;有選手疑似

  來源:中國新聞周刊

  8月22日晚,翻车第二屆世界人形機器人運動會在國家速滑館“冰絲帶”開幕。被撞不再賽場上演了不少機器人“翻車”的得分名場麵。在400米(大型組)預賽中,裂两有機器人選手未跑出第一個彎道便摔倒在地;有選手疑似沒有聽到發令槍聲,年后站在起點遲遲未動;還有選手完成衝線後,翻车撞上賽場設備,被撞不再身體被撞得四分五裂。得分現場工作人員不得不趕忙抬擔架,裂两“救完你的年后救你的”。

  最出圈的翻车一幕來自24日下午的自由體操比拚。一台程序異常、被撞不再脫離比賽軌跡的得分機器人,沒有摔倒,裂两反而在賽場中央緩慢旋轉、年后小幅擺動,動作竟如芭蕾舞般優雅連貫。工程師排查後認為,這可能是運動控製算法的臨時波動,在故障中自主微調姿態,意外演繹出一段“芭蕾舞”。這恰恰說明隨機應變的重要性。未來,機器人要讀懂場景,在各種壓力與意外中作出最優選擇,顯然需要比預設程序更複雜的智慧。

  具身智能的競爭,正從身體轉向大腦。兩個月前的第八屆北京智源大會上,北京智源人工智能研究院(以下簡稱“智源研究院”)院長王仲遠宣布,AI正經曆從“預測下一個詞元(Token)”到“預測下一個物理狀態”的重大變革。業內共識是,無論硬件如何“內卷”,大腦的好用程度將成為未來幾年的行業分水嶺。真正能打通機器人感知、決策、執行能力閉環的通用大腦,仍是稀缺資產。

  而這個所有機器人翹首以盼的大腦,業內喜歡叫它“世界模型”。

螞蟻靈波科技的R1機器人展示廚藝。本文圖/視覺中國螞蟻靈波科技的R1機器人展示廚藝。本文圖/視覺中國

  尋找基座

  如果你端著咖啡杯,問AI“我把咖啡杯鬆開會怎樣”,普通大語言模型會回答“它會掉在地上摔碎”,因為它從訓練數據裏看過這個答案。

  而世界模型則會觀察你鬆手時杯子距地麵的高度,結合當地重力加速度,告訴你“杯子會在0.5秒後落地”,並根據杯子材質模擬碎裂程度。它不需要讀過這句話,它自己會算。

  這便是世界模型,一個主攻物理環境認知和預測的係統。圖靈獎得主、Meta前首席AI科學家楊立昆(Yann LeCun)將世界模型定義為能預測行動後果的內部模擬器,是機器人對世界的認知引擎。除此之外,世界模型還有許多紛繁的定義,但共同點是,承認智能體需通過學習環境的物理規則,比如杯子下落會摔碎,來構建虛擬場景,從而無須實際行動就能預判不同決策的後果。

  美國斯坦福大學教授、World Labs創始人李飛飛研究空間智能,稱其為AI的下一個前沿。“……AI要理解、生成、推理並與三維空間交互,構建大型世界模型,正是實現空間智能最重要的路徑。”而李飛飛的學生、複旦大學通用物理智能研究院院長蘇昊則專注物理智能,希望AI在物理世界裏能有效完成任務,執行恰當的行動。

李飛飛 李飛飛 

  快思慢想研究院院長田豐認為,物理智能、空間智能、世界模型,是同一件事的三個切麵。他告訴《中國新聞周刊》,空間智能關心“房間的幾何結構記不記得住”,物理智能關心“抓、推、擰這些動作做不做得成”,而世界模型是這兩者背後的推演能力。

  “比起世界模型的定義,我們更關心真實物理世界需要怎樣的模型。”陳博遠告訴《中國新聞周刊》。他今年22歲,任智源研究院行為世界模型創新中心負責人,也是北京逆矩陣科技有限公司(以下簡稱“逆矩陣”)聯合創始人,該公司專注於下一代通用世界基座模型的開發。今年6月的北京智源大會上,逆矩陣聯合智源研究院發布了全球首個通用世界基座模型“悟界·Physis-v0.1”。Physis正是逆矩陣的英文名,源自Physics的希臘語詞根,有“世界本源”之意。

  在陳博遠看來,世界模型與大語言模型早期的演化路徑多有相似。在2022年前後,金融、法律等領域的垂類模型受到廣泛關注;如今,通用大語言模型出現了。而對於麵向真實物理世界的世界模型,行業也在思考,能否構建一種跨場景、跨本體、跨用途的通用基座模型,應用於不同真實場景。

  現在,輪到世界模型經曆“奧德賽時期”了。VLA是非常重要的一個嚐試。VLA即視覺—語言—動作(Visual-Language-Action),是具身智能實現感知、理解和交互的核心技術體係之一,2023年左右開始火熱。它的目標是讓機器人像人類一樣看懂周圍環境,聽懂任務目標,並執行操作。國內首個布局世界模型的企業極佳視界,旗下的世界模型GigaWorld便是VLA路線。

  VLA已能夠實現視覺輸入和動作輸出,但還不夠“通用”。本屆世界機器人大會上,許多觀眾發現,在有大量訓練數據的精確環境中,機器人已可以做好指定任務,但如果稍微改變場景設置,任務很可能就會報錯。一些機器人可以快速分揀和取用貨品,但如果視野中的觀眾太多,它就會原地不動,無法執行任務。

  宇樹科技董事長王興興在這一屆世界機器人大會上表示,如果一台機器人被帶到任意陌生環境,甚至進入家庭後,能完成80%左右的任務,具身智能就接近了真正的臨界點。

  有人把VLA看作和世界模型並駕齊驅的路線,也有人把VLA看作世界模型的一條分支。更有可能的是,VLA 與世界模型非簡單的“上下級”關係,二者在實際係統中可以互補融合。目前,世界模型還缺乏一個足夠泛化的基座,這也解釋了為什麽具身智能的通用大腦遲遲沒有出現。

5月22日,廣東深圳市,自變量機器人工廠內,工程師訓練人形機器人做家務。5月22日,廣東深圳市,自變量機器人工廠內,工程師訓練人形機器人做家務。

  “桌子有吸引力”

  “‘六小龍’吵起來了!”

  在今年7月的世界人工智能大會上,有一個世界模型“六小龍”圓桌論壇,湊齊了極佳視界、無界動力、自變量機器人等六家國內企業的世界模型負責人。這場談話仿佛幾大流派掌門的“華山論劍”,直指業內對世界模型技術路線最直接的爭論。

  極佳視界是像素空間派,希望將模型能力精進到對每一幀畫麵的學習和預測。無界動力則是隱空間派,這一派的“宗師”是楊立昆,其希望構建一個虛擬空間,讓AI身處其中去預測未來狀態。Meta在2025年6月發布的視頻模型V-JEPA 2就是這一路線。

  更多企業皈依了融合派,也就是吸取兩方的技術特點,不完全放棄視頻生成模型的訓練體係,但又結合自身技術優勢,推出各自領域的理解、預測模型。自變量機器人、智元機器人、螞蟻靈波科技都是如此。

  世界模型究竟該對物理世界有多大程度的理解?無界動力希望它盡可能接近物理模擬器,提出評價世界模型要看它對幾何、運動、力等狀態的預測精度。也有人認為,機器人沒必要先成為物理學家。螞蟻靈波科技方麵表示,物理合理性比物理精度更重要。機器人隻需要明白現實中,同樣重量的鐵比棉花落地速度快,但到底快多少,不需要知道,隻需要觀察。

  模型能力評價的標準也存在諸多分歧。智元機器人首推AI推理的長時物理一致性,即模型還原物理世界的穩定性,而自變量機器人則認為長程推演是“偽需求”,推理的時效性更重要。如果推理慢到錯過決策窗口,再完整的理解也沒用。

  可以說,如何實現世界模型,目前還未出現壓倒性的技術方案。觀點碰撞背後,企業們捍衛的是自家模型擅長的能力。世界模型想要走出“奧德賽時期”,自然需要技術上的收斂。

  逆矩陣也在走隱空間這條路。陳博遠指出,這條路需要獨特的訓練方法。世界模型可能很難照搬“堆數據”的路徑。一個很重要的原因是,人們能獲得的視頻和真機反饋數據,存在大量視覺冗餘。“如果我們希望模型學會用一支筆,筆是藍色還是紅色、放在黑板還是白板上,對於學習物理規律本身沒有作用。如何去除冗餘,重新采集甚至製造數據,是一大難點。”

  更關鍵的是如何構建因果。目前的大模型都維持著“吃掉”數據、體會相關性、給出最符合相關性的預測的運作模式,而“預測下一個物理狀態”並不會如此簡單。陳博遠指出,狀態本身可以認為是基於觸覺、視頻、語言數據壓縮出來的一個隱空間,但模型在這一空間裏可能隻會學習到一個數據分布,由這個分布歸納出的結論很有可能是錯的。

  例如,如果所有的視頻裏桌上都放滿了物品,那麽模型可能會認為“桌子有吸引力”。如果50%的視頻裏物品堆在桌上,另50%的視頻裏物品堆在地上,那模型會認為“這個世界的東西有50%的可能性被桌子吸住”。這些結論符合統計規律,但不符合物理現實。

  陳博遠的判斷是,模型應該學習的是“Δ (delta)”。它是物理學中一個代表變化量的符號,可以認為是一個操作、一個擾動、一個變化。比如把桌上的水杯向邊緣推一下,這個推力就成為一個關鍵的“Δ”,它促成了杯子狀態的改變。模型需要預測的,不是簡單的下一幀畫麵,而是什麽樣的“Δ”導致了這樣一個確定的未來。

  在今年6月的北京智源大會上,智源研究院發布了一套世界模型的分級體係。就像自動駕駛根據自動化程度分為L0—L5,世界模型也根據其距離真實世界的遠近,被分為W0—W5。在這一體係裏,W0級的世界模型多為視頻生成模型或3D重建類模型,它最終的目標是生成流暢好看的視頻(穀歌推出的Veo視頻生成模型),或一個可以隨時進入的3D空間(李飛飛World Labs旗下的Marble)。這些模型的優化目標是更高清晰度和穩定性。

  W1代表的是動作交互模型,比如穀歌的Genie係列模型。它們基於視頻生成模型,但開始希望模型能響應動作輸入。這一模型中,用戶可能沒有那麽在意物理正確性,這目前也是相對容易實現的。但對W0和W1模型來說,它們解決的是像素空間中的問題,距離真實世界還有距離。

  W2及以上的世界模型解決的是物理正確性。在這一級別,模型開始理解真實的物理世界,可以預測真實的物理後果,目前,達到這一能力層級的世界模型還鮮有出現。

  兩年後,能力躍遷

  即便是目前最前沿的世界模型,在嚴格測試下,也會暴露出短板。它們離真正的“世界模擬器”還有不小距離。

  遊戲中,我們能看到球憑空消失、運動軌跡錯誤等不符合物理規律的現象。這隻是最安全的一種“翻車”,到現實世界就沒那麽美妙了。一項專門針對自動駕駛世界模型的測試發現,即使是目前最好的模型,如穀歌Veo 3.1,在預測物理風險如熱油濺射、金屬遇水反應時仍不可靠,會錯過關鍵風險鏈條或誤判嚴重程度,遠未達到安全部署的要求。

  王仲遠曾表示,視頻生成模型可能生成一群在天上飛的豬,但物理世界不會這樣運行。如果機器人裝上一個不能區分真實和虛幻的大腦,它可能誤以為自己是鋼鐵俠,這會帶來嚴重風險。

  世界模型目前仍處於早期探索階段,其麵臨的挑戰也比大語言模型更為複雜。田豐認為,兩類模型所需數據完全不同。大語言模型學的是人類已寫下來的東西,是被人加工過一遍的二手經驗。世界模型學的是攝像頭、傳感器、機械臂直接采到的一手記錄。人類寫下的高質量文字總量大致到頭了,而視頻和傳感器數據每天新增的量要高出好幾個數量級。

  一個直觀的對照是,V-JEPA 2隻有12億參數,不到主流大語言模型的百分之一,卻用了超過100萬小時的視頻來訓練。數據稀缺和昂貴是這條路最核心的瓶頸。同時,模型生成的誤差會逐幀累積,導致場景漂移、物體遺忘、邏輯崩壞。當前最強的模型也隻能維持幾分鍾的物理一致性,而業界普遍認為,連續、可靠地模擬一小時以上的物理過程,才是工業可用的門檻。

  因此,世界模型需要真實硬件。“把模型用在真實的物理場景中,去收集應用這一模型得到的反饋,比如什麽時候失敗,什麽時候成功,什麽時候需要人類重點幹預,這些數據是非常珍貴的。”陳博遠說,就像學習騎自行車,人會在不斷嚐試中感受速度和風阻,保持平衡,或者摔倒。真實世界的反饋數據是模型學會歸因的基礎。

  當下,行業多用下遊任務來間接評估世界模型對物理世界的理解程度。但模型預測得準或不準,都不能直接等同於它真的理解了物理,更不能說明它學到的規律能遷移到新的場景。陳博遠指出,世界模型現在仍需兩套相互銜接的係統。第一套是模型生產基礎設施,包括算法、數據、訓練係統等,第二套則是物理基礎設施,即把模型接入真實世界。前者解決“怎樣造出可擴展的世界模型”,後者解決“怎樣讓模型在真實世界中持續學習”。

  不過,陳博遠認為,無論是硬件還是軟件,世界模型技術都在穩步收斂的路上。他預測,明年年底之前,數據采集方式和具身智能形態可能會收斂,18—24 個月內,世界基座模型能力會出現標誌性的階躍,36個月內,能實現多個真實場景的應用落地。這與大語言模型從GPT-3到ChatGPT的路徑高度吻合。

  田豐指出,自動駕駛裏,世界模型已得到了正反饋。特斯拉在去年10月的國際計算機視覺大會上介紹過其神經世界模擬器,用車隊回傳的數據訓練出一個仿真駕駛環境,並稱同一套係統可遷移到人形機器人。“車在路上跑的每一公裏都在自動產生反饋數據,這是其他方向短期內不具備的條件。”

  相比智駕這一短期最可能落地的場景,其他世界模型產品,比如Marble,田豐認為其進入市場還為時尚早。當在虛擬世界裏訓練的機器人,直接搬到真實世界後的成功率,超過用同樣成本采集真實數據訓練出來的成功率時,拐點就到了。從那一刻起,造數據比采數據劃算,這也許是世界模型帶給人們的最大顛覆。

  在更多從業者眼中,世界模型給了人類一個重新理解物理世界的方式。世界模型的應用也絕不限於具身智能這一個載體。在陳博遠看來,它的等號右邊,是整個真實物理世界,包括智能製造、工業仿真、科學探索等。未來,世界模型也許能彌補和接管人類無法實操的工作,甚至自主發現未知物理規律、提出假設並進行驗證。正如歸鄉的奧德修斯,它能激起的火花,遠超當下的所有想象。

  記者:周遊

點擊進入專題: 第二屆世界人形機器人運動會

很赞哦!(56)